更大的文本编码器可能会损害 CLIP 的零样本性能
文章背景与核心概要
对比语言-图像预训练(CLIP)模型是现代多模态机器学习的基石。在以往的大规模训练中,标度律(Scaling Laws)通常指导着计算资源的分配,人们往往假设盲目增大模型尺寸能带来性能的全面提升。然而,本文研究揭示了一个反直觉的现象:对于大多数视觉编码器而言,文本编码器存在一个最佳尺寸,一旦超过这个大小,零样本(Zero-shot)性能反而会下降——尽管模型的总参数量仍在增加。
作者证明,这种性能下降是由过大的文本编码器引起的过拟合所导致的,并且可以通过使用模态特定的权重衰减(weight decay)来缓解。通过几何分析,他们进一步表明,盲目扩展文本编码器虽然能提高嵌入空间的均匀性(uniformity),但会以牺牲跨模态对齐(cross-modal alignment)为代价。该研究不仅为零样本性能提供了预测性指标,也为设计更高效、更可靠的 CLIP 扩展路径开辟了新方向。
论文元数据
- arXiv ID: arXiv:2609.05730 [cs.CV]
- DOI: 10.48550/arXiv.2609.05730
- 主要学科: 计算机视觉与模式识别 (
cs.CV), 人工智能 (cs.AI) - 提交日期: 2026年9月4日
- 作者: Samir Char, Carles Domingo-Enrich, Randall Balestriero
摘要
对比语言-图像预训练(CLIP)是许多机器学习应用的核心构建模块。虽然标度律一直指导着大规模训练的资源分配,但以往的工作通常将 CLIP 的整体模型大小视为单一变量,而没有探讨视觉与文本编码器之间的容量分配如何影响下游性能。
在本文中,我们训练了多个具有不同视觉和文本编码器尺寸的 CLIP 模型。结果表明,对于大多数视觉编码器,文本编码器存在一个最佳尺寸,一旦超过该尺寸,零样本性能就会下降——即使总参数量仍在增加。利用这一特性,我们可以构建出高效的配置:在参数量减少高达 55% 的情况下,依然能够匹配标准 ViT-B/16 架构的零样本性能。
我们进一步证明,这种性能下降源于过大文本编码器所导致的过拟合,而采用模态特定的权重衰减系数不仅可以恢复性能,还能在所有受损的配置中进一步提升性能。几何分析表明,扩展文本编码器会带来一种权衡:它提升了嵌入的均匀性,但恶化了跨模态对齐;我们进一步证明,这些指标能够有效预测零样本性能。我们希望这些发现能推动 CLIP 架构和训练方法的发展,以克服这种性能下降问题,这是实现 CLIP 可靠且高效扩展的先决条件。
访问链接与资源
- 全文选项:
- 查看 PDF
- HTML(实验性)
- TeX 源码
- 许可证: 知识共享署名 4.0 国际许可协议

- 外部引用与工具:
- Google Scholar
- Semantic Scholar
- NASA ADS